mrsaynothing.dev

> grep -r "local LLM"▋

8 articles

2026-10-06

llama.cpp vs Ollama — lequel devriez-vous lancer ?

Le dossier public, lu pas exécuté : Ollama fige son moteur llama.cpp en b11351 quand l'amont livre b11443. L'un est un appareil, l'autre la salle moteur.

2026-10-02

Calculatrice VRAM GGUF : vérifiez avant de télécharger

Taille du modèle, quant et contexte en entrée — poids, cache KV et verdict par carte en sortie. La calculatrice VRAM GGUF répond avant le téléchargement.

2026-09-23

vLLM peut-il lire du GGUF ? Oui — GPU uniquement

vLLM peut-il exécuter du GGUF ? Oui — via le plugin officiel, sur GPU uniquement. La syntaxe serve, le piège du tokenizer, les limites matérielles, et quand llama.cpp gagne.

2026-09-13

Quantification GGUF : Q4_K_M vs Q8_0, taille et VRAM

Niveaux de quantification GGUF comparés : Q4_K_M vs Q8_0 en taille, VRAM et qualité, et la règle — Q4_K_M par défaut, on monte seulement pour le code.

2026-09-10

llama.cpp vs Ollama : lequel utiliser en 2026 ?

llama.cpp vs Ollama : Ollama emballe llama.cpp pour le confort, le llama.cpp brut gagne en vitesse et en contrôle. Benchmarks, flags GPU, cas d'usage gagnants.

2026-09-07

Lancer un modèle GGUF en local : Ollama, llama.cpp & vLLM

Comment exécuter des modèles GGUF en local : pull Ollama en une ligne, llama.cpp direct depuis une URL Hugging Face, et le bon quant selon ta VRAM.

2026-09-04

Meilleur LLM local pour coder : de 8 à 24 Go de VRAM

Le meilleur LLM local pour coder par tranche de VRAM : Qwen3 Coder vs DeepSeek à 8, 12, 16 et 24 Go, le bon quant par carte et un setup Ollama prêt à l'emploi.

2026-09-01

Ollama vs LM Studio : quel outil LLM local choisir ?

Ollama vs LM Studio pour le vrai travail de dev : installation, GPU, vitesse et API locale — avec des commandes prêtes à l'emploi pour choisir aujourd'hui.